메뉴

#추론 서빙

HN
Hacker News • 27일 전
IMP 8

vLLM v0.28.0 릴리스

오픈소스 LLM 추론 서빙 엔진 vLLM의 v0.28.0이 공개되었습니다. 이번 버전은 270명의 기여자가 참여한 584개 커밋을 포함하며, Kimi-K3 성능 최적화, DeepSeek V4 스파스 MLA 지원, 추론 디코딩 개선, Model Runner V2 성숙화, 계층형 KV 캐시 오프로딩 등이 핵심입니다. 일부 호환성 깨는 변경(breaking changes)도 포함되어 업그레이드 시 주의가 필요합니다.

vLLM 추론 서빙 LLM
HN
Hacker News • 35일 전
IMP 7

텍스트-음성 변환 모델을 50ms 미만 응답으로 만든 방법

Qwen3-TTS 1.7B CustomVoice를 단일 NVIDIA H100에서 서빙하여 초당 10건의 요청(RPS)을 처리하면서도 p95 첫 오디오 지연시간(TTFA) 50ms 미만을 달성한 오픈소스 구현을 소개한 글이다. 선행 무음 제거와 코덱 프레임 누적 튜닝을 통해 기존 vLLM-Omni, SGLang-Omni, VoxServe 등 대비 가장 낮은 지연시간을 확보했으며, 비용도 백만 자당 약 2달러로 ElevenLabs(100달러)나 Cartesia(49달러)보다 훨씬 저렴하다.

TTS(음성합성) 지연시간 최적화 추론 서빙